MedScope: A Lightweight Benchmark of Open-Source Large Language Models for Medical Question Answering
Il paper introduce MedScope, un benchmark leggero e open-source che valuta in modo sistematico e multidimensionale le prestazioni di modelli linguistici di grandi dimensioni open-source su domande mediche, evidenziando la loro utilità come baseline trasparenti ma anche le attuali limitazioni per il dispiegamento autonomo in contesti sanitari ad alto rischio.